• 潘宇轩, 金锐, 刘雨, 张琳
    图学学报. 2026, 47(1): 29-38.

    现有的多视点立体视觉研究利用深度估计算法,通过建立物理世界与数字世界的映射关系来实现立体表征。基于有监督学习的神经网络算法通过训练能够取得准确且高保真的三维重建结果。然而,由于缺乏深度先验信息且图像具备大视场的特性,面向自然场景的视觉重建仍然具有挑战性。研究应用无监督学习网络和基于语义优化的神经辐射场(NeRF)渲染,在没有先验信息的情况下实现对自然采集的多视点图像的深度估计。首先通过无监督学习无参考地生成多视点图像初步的深度信息,进一步在独立的NeRF模型中,利用扩散模型建立表面语义渲染损失来实现细粒度的三维表征。在基准数据集上的实验结果表明,该方法与其他最先进的方案相比整体重建的指标平均提高了24.6%;在宽基线数据集的泛化性能验证中,该方法将现有方法测得的重建误差最多降低了40.8%。

  • 酒明远, 吴国伟, 宋旭光, 李书攀, 徐明亮
    图学学报. 2026, 47(1): 47-56.

    随着深度学习技术的快速发展,其在图像分类等任务中取得了显著成果。然而,这些模型的成功往往依赖于大量高质量的标注数据,而在实际应用中,标注数据通常稀缺,人工标注过程又极为耗时、费力,限制了模型的推广与应用。近年来,主动学习因其能够在有限标注预算下提升模型性能而受到广泛关注,其核心思想是根据样本的不确定性、多样性或代表性等指标,挑选最有价值的数据进行标注。针对传统主动学习方法多依赖手动设计的启发式采样策略,难以适应不同任务场景,且选择策略难以动态优化等问题,提出一种基于智能强化主动学习(SRAL)的图像分类方法,通过将样本选择过程建模为马尔科夫决策过程,利用强化学习的自适应策略优化能力,引导模型从未标注样本中动态挑选最具价值的样本用于标注。其中,状态由未标注样本提取的特征构成,动作表示是否选择样本进行标注,奖励函数则定义为当前样本加入训练集后模型准确率的变化差值。采用演员-评论家(Actor-Critic)算法进行策略优化,并引入不确定性启发式排序作为辅助信息以提升学习效率。实验结果表明,在CIFAR-10,SVHN和FASHION-MNIST等数据集上,所提出的SRAL方法在相同标注预算下,相比于其他主动学习方法,能够显著提高分类准确率,且在各数据集上均展现出较好的稳定性和泛化能力,验证了SRAL方法在提高图像分类模型性能方面的有效性与优势。

  • 李章明, 关伟凡, 常政威, 张凌浩, 胡庆浩
    图学学报. 2026, 47(1): 39-47.

    随着大模型规模的不断增长,模型推理的内存占用和计算开销成为重要挑战。模型量化是降低模型资源消耗的有效方法,但现有方法在权重量化过程中存在离群点处理不足、量化精度损失显著以及内存访问效率低下等问题。为此,提出一种内存对齐的大模型混合精度量化方法,通过将模型参数表示成不同位宽的量化参数实现混合精度量化方法,在降低模型存储的同时缓解量化带来的精度损失问题。具体来说,基于小组显著性分析划分权重离群点,将模型参数按单指令多数据流(SIMD)单元对齐分组,并依据显著性对不同小组采用8 bit或2 bit量化;针对2 bit量化可能导致的精度损失,引入分块量化补偿策略。此外,设计了一种高效的混合精度权重打包与存储方案,通过位图(Bitmap)记录数据块位宽类型,支持随机访问。实验结果表明,该方法在保证模型精度的同时,显著降低了内存占用并提升了计算效率。通过在Llama2-7 B,13 B和70 B上进行验证,相比最先进的方法,在WikiText2和C4数据集上的困惑度(PPL)分别下降8.13,2.84,1.37及5.80,并且量化后的70 B模型相对BF16权重存储约减87%。此外在7个QA数据集上平均准确率提升6.24%。其结果表明,基于内存对齐的大模型混合精度量化方法能够同时提升压缩率、访存效率与模型性能。

  • 王博雅, 王绍宗, 杨万然, 周兴炜, 侯亮, 熊成悦
    图学学报. 2026, 47(1): 179-193.

    复杂成形装备的传统研制方式通常采用基于文档的系统工程(DBSE)方法开展,存在需求分析不完善导致研发缓慢、文本二义性导致需求覆盖不全、装备进展落后于技术迭代等问题,造成设计出的复杂成形装备存在设计指标不满足使用要求、反复修改致使设计效率低下等问题。因此,在复杂成形装备概念设计阶段,参考美国国防部体系结构框架(DoDAF),结合基于模型的系统工程(MBSE),提出了基于MBSE的复杂成形装备概念设计方法。并以全景、能力、运行、系统及标准共5类视角作为复杂成形装备概念设计的切入点,通过多类视角切入分析开展复杂成形装备顶层需求获取、需求细化分析、功能分析及系统建模共4层级设计,并使用系统建模语言(SysML)建立起11种模型,实现复杂成形装备概念设计阶段的数字化和流程化表达。最后,以超塑成形装备作为典型实例进行设计方法的应用演示。通过实际应用解决了传统设计方式痛点问题,表明了方法对复杂成形装备的正向研制有良好的指导作用。

  • 李晔, 贾俊洋, 黄冠, 李玉洁, 齐文婷, 刘岩
    图学学报. 2026, 47(1): 57-67.

    夜视环境下,强光源引发的眩光干扰显著降低图像质量,影响夜视辅助驾驶系统的感知性能,现有眩光去除算法面临鲁棒性不足、计算复杂度高以及光源信息丢失等问题。为此,提出了一种面向夜视辅助驾驶的轻量化图像眩光去除方法(NFR-Net+)旨在提升图像清晰度并满足移动端实时计算需求。首先设计特征过滤机制,结合残差连接策略,增强网络对复杂夜视场景的特征提取能力,有效抑制过拟合,从而在不同光照条件和眩光类型下实现稳定的眩光去除效果。其次,引入非线性无激活特征注意力模块,通过轻量化设计构建高效注意力机制,显著提升图像细节重建质量,同时将模型参数量降低约8.28%,运行内存减少约11.1%,大幅优化计算效率。此外,针对传统方法中光源信息过度去除导致图像自然度下降的问题,优化了分割网络中的光源提取模块,通过改进的光源分离策略,精确保留光源区域的亮度和纹理信息,确保输出图像的真实性和自然感。实验结果表明,NFR-Net+在结构相似性(SSIM)、峰值信噪比(PSNR)和学习感知图像块相似度(LPIPS)等图像质量评估指标上均优于现有主流方法,表现出更高的去眩光性能和细节保留能力。同时,该方法在多种夜视场景和不同硬件设备上均展现出良好的适应性,能够满足实时处理的高效性要求,为智能视觉系统在资源受限的移动端部署提供了可行性。进一步的消融实验验证了各模块的有效性,凸显了特征过滤和注意力机制在提升性能与降低资源消耗中的关键作用。且为夜间自动驾驶和智能监控等应用场景提供了高效、轻量化的解决方案。

  • 张冰钰, 况立群, 熊风光, 孙凡淑, 焦世超
    图学学报. 2026, 47(1): 152-161.

    目前主流的包围盒方法在三维场景渲染、光线追踪和碰撞检测等任务中广泛应用,但在拟合复杂几何形状时存在空间利用率低、拟合精度不足等问题,难以确保严格的保守性,并在降低误检率方面仍有改进空间。为解决上述问题,提出一种结合隐式几何编码与Lipschitz约束的保守包围盒构造方法,隐式几何编码通过位置编码将输入坐标映射至高维空间,从而捕捉局部及全局的几何信息,提升包围盒的适应性;随后,引入可训练的Lipschitz线性约束层,动态调整Lipschitz常数以控制梯度变化,并结合Lipschitz正则化损失与动态加权交叉熵损失,在优化边界拟合的同时降低假阳率。实验结果表明,该方法在多个三维模型上均能实现假阴率为0,且相比基准方法,误检率最高降低3.1%,单条光线查询方法提高1.7 ms,为高精度保守包围盒拟合提供了一种高效、稳健的解决方案。

  • 李奕, 曹成才, 宋章通, 李祚奇, 黎晓, 李和森
    图学学报. 2026, 47(1): 223-233.

    随着人工智能技术的快速发展,多模态机器人在学前儿童的教育、娱乐及日常生活中扮演着日益重要的角色。现有研究多关注机器人单一感官线索对儿童感知的作用,但关于多感官整合效应仍缺乏系统性研究。为探究机器人多模态特征如何共同影响儿童的情感偏好和视觉注意力,招募318名4~6岁儿童参与1项眼动追踪实验。实验采用2(外观特征:拟人型、拟动物型)×3(声音引导:男声、女声、无)×2(手势引导:有、无)的三因素混合实验设计,以机器人外观特征(拟人型与拟动物型)和行为特征(声音、手势引导)为自变量,以儿童情感偏好和眼动指标为因变量,系统考察了多感官特征对儿童用户的影响。结果表明,在外观特征方面,拟人型机器人和拟动物型机器人在主观偏好评分上没有显著差异,但拟人型机器人吸引了更长的总注视时长、更多的注视次数和更短的首次注视时间,拟人型机器人在注意力指标上显著优于拟动物型机器人,儿童在视觉接触的初始阶段更容易被拟人型机器人所吸引,且拟人化设计在持续吸引儿童注意力方面更具优势。在行为特征方面,具有手势引导的机器人在主观偏好评分上显著高于无手势机器人,且吸引了更长的总注视时长和更多的注视次数。女声机器人在主观偏好评分上略高于男声,且两者均显著高于无声机器人。男声机器人在总注视时长上略高于女声,且两者均显著高于无声机器人。而女声和男声机器人在注视次数的差异不显著,但两者均显著高于无声机器人。具有手势引导和声音(尤其是女声)的机器人在主观评分和视觉注意力分配上表现更好,说明行为特征在增强儿童的情感偏好和互动体验中具有重要作用。此外,外观和行为特征对儿童情感偏好和视觉注意力的影响相对独立,未观察到显著交互作用。该研究揭示了机器人外观和行为特征对学前儿童情感偏好和视觉注意力的影响机制,为设计满足用户情感偏好的儿童机器人提供了科学依据。

  • 宋琢, 卢德辉, 黄志超, 田时雨, 颜嵘龙, 邓逸川
    图学学报. 2026, 47(1): 68-77.

    施工现场的组织管理是工程管理的关键环节,但传统的人力监管方法限制多、效率低。近年国家多部委发布有关政策,呼吁促进人工智能与实体经济深度融合,以人工智能推动经济高质高效发展。计算机视觉(CV)技术的准确性、高效性和自动化等优点使CV技术在施工监理领域的应用逐渐广泛,特别是无人机能高效获取复杂多变的施工场景视觉数据的特性显示出其在基于CV技术的施工监管任务中的应用潜力。但当前基于无人机的施工场景目标检测研究有限,且稀缺的无人机视角下的施工场景图像数据集限制着有关研究的深入发展。因此,采用大疆Mavic 3T无人机用于获取施工现场图像,以建立开源的施工场景俯拍图像数据集UB-CSD。选用多种先进目标检测算法在UB-CSD数据集上进行对比实验,从模型流程设计、计算原理和任务场景特性等维度分析各算法性能差异原因。各算法的mAP检测结果为YOLOv8和YOLOv10 (96.1%),YOLOv9 (96.0%),YOLO11 (95.7%),DETR (95.3%),Faster-RCNN (76.3%)和RetinaNet (72.1%)。分析结果表明,YOLO系列算法是基于无人机的施工场景目标检测任务算法的最优选。通过构建全新的开源专用数据集和开展对比实验得出的以上数据及结论,将为建筑业安全生产管理与日后相关检测研究提供有效数据与实验案例。

  • 杨彪, 王学, 官铮, 龙萍
    图学学报. 2026, 47(1): 99-110.

    在智能交通监控系统中,复杂场景下的小目标车辆检测面临特征分辨率低、遮挡干扰严重、模型计算冗余及边界框回归精度不足等挑战。为兼顾检测精度与边缘设备部署效率,提出一种基于动态稀疏注意力与轻量化双分支结构的改进YOLOv8检测框架。首先设计双向路由稀疏注意力机制(ReBiAttention),通过双层动态路由筛选关键特征,增强对小目标浅层特征的保留能力;随后结合GSConv与VoV-GSCSP模块,在减小计算量的同时动态调整多尺度特征权重;并在检测头部分引入改进型DynamicHead结构,实现多任务自适应优化;最后改进ShapeIoU损失函数,引入形状与尺度感知机制,提升定位精度。在UA-DETRAC数据集上的实验表明,改进模型较基线YOLOv8n的Precision,Recall与mAP@0.5分别提升8.739%,1.685%和7.225%,参数量减少4.3%。该方法为复杂交通场景下的小目标车辆精准检测提供了高效解决方案。

  • 向梦丽, 黄志勇, 佘雅丽, 丁妥君
    图学学报. 2026, 47(1): 90-98.

    针对现有图像匹配方法在大视角变换场景中匹配精度和匹配数量显著下降的问题,提出了一种改进的E-LoFTR图像匹配方法。首先,采用先视角调整后精细匹配策略,提出了一种新颖的双阶段SIFT视角矫正模块,该模块结合了尺度不变特征变换(SIFT)算法的视角不变性与单应性变换(homography)的几何对齐能力,提高了模型对大视角变换的适应能力。然后,设计了方向感知门控注意力机制,使用多方向卷积和动态门控的级联结构提取查询(Q)、键(K)、值(V),注入的几何先验显著提升了模型的鲁棒性。最后,为了避免特征融合过程中的信息损失问题,使用Fusion-DySample上采样模块提升匹配性能。在公开数据集MegaDepth上的实验结果表明,所提出的方法在旋转误差阈值为5°,10°和20°下的相对位姿估计累计曲线下面积分别为57.1%,72.7%和83.9%,较E-LoFTR分别提升0.7%,0.5%和0.4%;在基于MegaDepth构建的全新数据集NewMega和私有工业数据集上,匹配点对数量和匹配正确率均显著提升。

全部文章
  • 期刊名称. 年卷期,起止页 doi:
    文章摘要
全部文章
  • 期刊名称. 年卷期,起止页
    文章摘要